大家好,前幾天我們聊了各種 AI 治理的法律、框架與國際標準。
今天,我們要來探討一個非常核心、也是近年來不論在資安審計、GRC 還是法律合規上都被高度檢視的議題:AI 偏見(AI Bias) 與 可解釋性 AI(Explainable AI, XAI)。
你可能在新聞上看過類似的荒謬案子:
2018 年,亞馬遜(Amazon)悄悄廢棄了一套幫忙篩選履歷的 AI 系統。
因為這套 AI 居然會「自動扣女性候選人的分數」。
只要履歷上出現「女子(如女子籃球社)」之類的字眼,AI 就會直接把這份履歷排到後面。
為什麼會這樣?難道 AI 也會重男輕女?
當然不會,AI 沒有性別偏好。問題是出在我們餵給它的「歷史資料」裡,過去十年被錄取的工程師大多是男性,AI 就自作聰明地學會了這個特徵,以為:「男性 = 優秀工程師的必備條件」,進而重現並放大了這個偏見。
今天,我們就來拆解 AI 偏見的六大類型,以及我們如何利用可解釋性 AI(XAI)工具來拆開大模型的黑盒子,落實法規要求的透明度。
一、 必須認識的 AI 偏見六大類型
AI 會學壞,往往是因為資料或演算法在各個階段出了問題。在進行合規審計時,通常需要識別這六種常見的偏見來源:
1. 歷史偏見(Historical Bias)
-
定義:訓練資料百分之百真實反映了歷史,但歷史本身就充滿了不平等、歧視或偏見。
-
例子:上述亞馬遜的履歷篩選器。即使收集到的歷史數據是真實的,AI 一樣會把歷史偏見完美學起來,並在未來做判定時放大。
2. 抽樣偏見(Sampling Bias)
-
定義:收集來的訓練資料「偏食」,沒辦法代表真實世界中的所有群體。
-
例子:某款皮膚癌診斷 AI,訓練資料裡 95% 都是白人的照片。當它被拿來診斷膚色較深的人種時,準確率直接暴跌。
3. 標籤偏見(Label Bias)
-
定義:資料在人工標記(Labelling)的階段,就已經被標記人員的主觀偏見給污染了。
-
例子:在標記情緒分析資料時,標記人員因為隱性歧視,把特定群體的正常發言標記為「憤怒」,而把主流群體的同樣發言標記為「挫折」。
4. 演算法偏見(Algorithmic Bias)
-
定義:資料本身很公平,但因為我們設定的「優化目標(Loss Function)」有問題,導致少數群體受害。
-
例子:模型在設計時只追求「整體準確率達到 98%」。結果模型在佔了 98% 的主流群體上判定極準,但在只佔 2% 的少數群體上判定全錯。整體分數看起來很漂亮,但少數群體卻被系統性犧牲了。
5. 測量偏見(Measurement Bias)
-
定義:用來測量的工具、指標或特徵收集本身就帶有偏見(例如:用「打字速度」來評估一個寫程式的工程師是否優秀,測量指標本身就產生了偏差)。
6. 聚合偏見(Aggregation Bias)
-
定義:硬要把所有不同特徵的群體套在同一個模型裡,導致模型對特定子群體(Sub-groups)的表現很差。
-
例子:不同人種的糖尿病臨床指標其實有差異,如果硬用同一個統一模型來診斷,對亞裔人群的準確率就會非常低。
二、 緩解偏見的三大防禦層次與技術極限
要怎麼幫 AI「去偏見(Debiasing)」呢?我們可以在 AI 生命週期的三個階段動手腳:
-
前處理(Pre-processing):在資料餵給 AI 訓練之前就先調整。
-
重新採樣(Resampling):如果某個少數群體的樣本太少,我們就故意複製、增加該群體的樣本(過採樣)。
-
重新加權(Reweighting):提高少數群體樣本在訓練時的損失權重。
-
處理中(In-processing):在 AI 訓練時,在損失函數裡加上「處罰項」。如果 AI 做出偏心、不公平的判定,就直接扣它分。
-
後處理(Post-processing):在 AI 輸出結果之後,手動微調它的門檻值。
-
閾值調整(Threshold Adjustment):為不同群體設置不同的決策門檻,強迫達到同等的通過機率。
💡 自學筆記:不可能同時完美的公平性(Impossibility Theorem of Fairness)
這是在準備 GRC 時,我覺得在實務上對我們做系統分析、跟客戶談需求的人來說,最重要的一個觀念:在數學上,你不可能同時滿足所有的公平指標(Impossibility Theorem of Fairness)!
這在系統開發上,就像在玩一個「拆東牆補西牆」的平衡遊戲:
你調高了少數群體的錄取率,強行達成「人口統計平等(Demographic Parity)」,就一定會對那些成績更好的主流族群產生不公平,破壞了「機會均等(Equal Opportunity)」。
在實務上,要調到多公平,從來都不是一個單純的技術問題,而是合規、公關、甚至法律與道德的多方綜合博弈。
所以,身為系統分析師,在幫客戶客製化 AI 去偏見系統時,絕對要白紙黑字把「我們要採取的公平性指標與判定門檻(Threshold)」列入系統需求說明書(SRS)並由客戶高階主管簽核。不然到時候系統上線,不管 AI 怎麼判,你都會面臨某一邊群體的抗議或法律訴訟,這是開發 AI 應用時極其關鍵的防坑實務!
三、 拆開 AI 黑盒子:可解釋 AI(XAI)的兩大神兵
大語言模型和神經網路通常是一個複雜的「黑盒子」,我們很難知道它是怎麼算出結論的。
這會帶來法律與稽核上的大麻煩 —— 比如在 GDPR 第 22 條 中,當涉及「自動化個人決策(如拒絕貸款)」時,法律賦予了個人 「獲得解釋的權利(Right to Explanation)」。同時,這也直接對應了我們昨天在 ISO 42001 裡學到的「可審計性(Auditability)」與「可問責性(Accountability)」。
為此,我們需要 XAI(可解釋性 AI) 系統。在實務上,最常用的兩個分析工具是:
1. LIME(區域可解釋性、與模型無關之說明)
-
核心特色:局部解釋(Local Explanation)。
-
它是怎麼辦到的?:它不看整個模型的複雜架構。它只針對「單一次的預測結果」,在該樣本周圍故意加一點點干擾(擾動),看 AI 的回答會怎麼變。藉此推導出在「這一次預測」中,哪些特徵對最終決策的貢獻度最大。
-
例子:解釋「為什麼這次拒絕了王小明的貸款?」,LIME 會回覆:「因為在王小明的情況下,『負債比過高(影響力 65%)』和『信用紀錄不足(影響力 25%)』是扣分的主要關鍵。」
2. SHAP(沙普利值解釋)
-
核心特色:全局與局部皆可解釋,基於博弈論(Game Theory)的數學模型。
-
它是怎麼辦到的?:它把每個特徵當成是「博弈賽局中的合作玩家」,去計算如果加入或移除該特徵,對最終預測結果造成的「平均邊際貢獻」。
-
優點:數學邏輯最嚴密,可以幫我們畫出整隻模型的「特徵重要性分布圖(Global Interpretation)」,讓我們知道整隻模型在做判斷時,最依賴哪些核心指標。
🔑 模擬題解析
Q: 一家金融機構正在稽核自家的 AI 房屋貸款審查系統,以確保該系統在決定拒絕特定客戶的貸款申請時,其決策理由是透明且能被稽核人員理解的。安全團隊希望為這『單次的理賠拒絕決策』,生成局部的解釋說明,以便向申請人進行合規說明。請問安全團隊應該採用哪種技術?
A. 差分隱私
B. 對抗性去偏見訓練
C. LIME
D. 拜占庭容錯聚合
【正確答案】C
【解析】
-
抓解題關鍵字:
單次的理賠拒絕決策、生成局部的解釋說明。
-
分析:在 GRC 審查與 XAI 技術中,最常拿來做「局部(Local)、單次、個別決策解釋」且與底層模型結構無關(Model-agnostic)的工具,就是 LIME(區域可解釋性說明)。
- 選項 A 差分隱私是防範隱私外洩的;選項 B 是用在訓練中減少偏見的;選項 D 是在聯邦學習中防範髒數據更新的,都與「生成單次決策的局部解釋」無關。所以正確答案選 C。
🎯 今日學習筆記重點
-
歷史偏見:資料反映了有偏見的歷史,AI 照單全收(Amazon 案例)。
-
抽樣偏見:訓練資料「偏食」,少數群體樣本不足。
-
去偏見三階段:前處理(重新採樣)、處理中(損失處罰)、後處理(閾值調整)。
-
公平性的數學衝突(Impossibility Theorem):在數學上無法同時滿足所有的公平性定義。去偏見不是單純的技術問題,而是 GRC 中的「治理與需求決策」,需要落實在 SRS 規格書中。
-
解釋權(Right to Explanation):如 GDPR 第 22 條,自動化決策必須可解釋。
-
LIME:黑盒子的解密工具,專攻局部、單次決策的特徵影響力解釋。
-
SHAP:基於博弈論,能做全局與局部的決策特徵重要性分析,數學邏輯最嚴密。
明天是我們的最後一天!我們要來為這 30 天進行終極的大總結。
我們明天見啦!